MUSA SDK v4.3.8 发布版本信息
下载链接
MTT S5000
- 下载链接
- 支持操作系统:
- Alibaba Cloud Linux 3
- VesselOS 2.0 (LTS-SP2)
- Kylin Linux Advanced Server V10
- Ubuntu 22.04.4 LTS
发布说明
MUSA SDK v4.3.8 版本基于 MUSA SDK 4.3.0 分支进行功能迭代和问题修复,在 4.3.6 基础上持续优化大模型训练与推理性能、完善 DeepEP 多机通信能力,并进一步提升系统稳定性与易用性,现已正式发布。
本版本已完成多平台发布测试,CTS 无新增问题,模型训练与推理性能达标。部分专项测试存在已知问题,评估为不影响本次版本发布,作为 Open Issue 后续跟踪。
具体支持平台详见下方列表。
支持平台
MTT S5000支持平台
| CPU | OS | 内核版本 | MUSA SDK包 |
|---|---|---|---|
| Intel | Alibaba Cloud Linux 3 | 5.10.134-13.al8.x86_64 | RPM |
| VesselOS 2.0 (LTS-SP2) | 6.6.0-100.jd_b007.x86_64 | RPM | |
| AMD | Ubuntu 22.04.4 LTS | 5.15.0-105-generic | DEB |
| Hygon | Kylin Linux Advanced Server V10 (Halberd) | 4.19.90-89.11.v2401.ky10.x86_64 | RPM |
产品说明
摩尔线程 MUSA SDK 是一套完整的 GPU 并行计算开发环境,专为利用摩尔线程 GPU 加速程序而设计。通过 MUSA SDK,您能够轻松地利用 GPU 加速各种应用,涵盖企业数据中心、桌面、工作站以及云平台和超级计算机等多个领域。该套件包括了 GPU 加速库、调试和优化工具、C/C++编译器以及用于应用程序部署的运行时库等功能。作为一套完整的开发工具,MUSA SDK 包含了以下主要组件:
- MUSA Toolkits,包含底层编译器、MUSA 运行时库、Musify 工具以及MUSA-X 基础数学计算加速库
- muDNN,MT GPU 深度学习加速库
- MCCL,MT GPU 通信加速库
- MUSA SDK 依赖于摩尔线程 GPU 和摩尔线程 GPU 通用驱动程序
- MT GPU:MTT S5000, MTT S4000,MTT S3000,MTT S80, MTT X300 等
- 通用驱动软件
功能描述
- 支持 SIMT 架构并行编程模型
- 提供 mcc 编译器工具链
- MUSA 驱动与运行时库
- 摩尔线程 MUSA 数学库 (muBLAS, muFFT, muPP, muRAND)
- MCCL 通信库 (支持多 GPU 和多节点通信,优化 PCIe 和 MTLink 互联)
- muDNN 深度学习加速库
主要更新
功能更新(Feature Updates)
-
编译器与工具链增强(mcc)
- 修复若干编译器实现问题,解决部分场景下的编译报错问题
-
运行时与驱动优化(Driver/Runtime & KMD)
- 修复
musaStreamWaitEvent在特定场景下的误报超时问题 - 优化异常处理上报时的队列(queue)污染逻辑,细化异常定位
- 驱动适配 MTBIOS EDC 新接口
- 增强 MUSA Snapshot 内存转储功能
- 修复大模型微调训练场景下偶发的 GPU firmware hangs 问题
- 修复服务器偶发重启的问题
- 修复
-
通信能力增强(MCCL & DeepEP)
- 新增 DeepEP V1 Internode low-latency 模式对 topk 16 / 896 experts 场景的支持,并扩展对 768 experts 规模场景的支持
- 修复 DeepEP 单机内 dispatch 通信与双机互联场景下的通信报错问题
- 修复 DeepEP internode combine 异常与 low-latency kernel timeout 问题
- 修复多机 alltoall 通信在特定场景下带宽骤降的问题
- 修复 MTSHMEM 性能测试场景失败的问题
-
算子与框架支持增强(muDNN & FlashAttention)
- 新增 causal 模式下 FlashAttention deterministic 特性支持
- FlashAttention Varlen Forward/Backward 通过 MATE 提供接口,兼容 FA3 接口
- 修复 varlen FA 反向计算在特定场景下出现 NaN 的问题
- 修复
torch.logsumexp输入全为 -inf 时输出 NaN 的问题 - 修复部分模型使用 muDNN 后出现的性能回退问题
- 规范 muDNN kernel 的 stream 使用
- 修复部分大模型推理性能回退与性能空泡问题
- 修复长序列推理场景下的非法地址访问问题
-
推理与训练框架支持(vLLM & sglang & 强化学习)
- 修复 sglang 推理场景下大模型吞吐性能下降的问题
- 修复 vLLM 多卡推理服务启动报错与编译报错问题
- 修复强化学习训练场景下偶发的显存不足(OOM)问题
- 修复部分大模型训练性能波动与下降的问题
- 修复交叉兼容场景下的运行时报错问题
-
监控与运维工具增强(DCGM/GMI/MTML)
- DCGM 支持通过软件故障注入方式生成 XID 异常,便于异常场景测试与验证
- 修复 dcgm-exporter 启用 PFM 监控或配置变更时触发的 GPU-FW hang / MMU Core fault 问题
- 修复 dcgmi dmon 监控 PFM 相关字段显示为 n/a 的问题
- 修复 DCGM 新增监控项开启后导致大模型训练性能波动的问题
- 优化进程级别 GPU 利用率刷新效率,利用率数值之和不超过 100%
- 修复 GMI 查询 GPU UUID 为全 0 及 GPU 负载显示异常的问题
- 修复 mthreads-gmi 操作导致服务器重启的问题
产品组件说明
具体包名称与版本信息请以开发者官网对应版本下载页为准。

